-
WorldArena 论文精读WorldArena 将 embodied world model 的视频感知质量、下游任务功能和人类判断放进同一套评测,并用 EWMScore 量化感知—功能鸿沟。
16 min read -
WSA1 论文精读:3D World-Spatial-Action Robot Control精读 WSA1:用 3D 世界预测、3D 一致视觉思考和 3D 逆动力学统一 VLA/WAM,并以 6,000 小时异构数据实现高效泛化。
19 min read -
VTAM 论文精读:让机器人用触觉预测接触动力学精读 VTAM:把 GelSight 触觉流纳入视频世界模型,并用虚拟力正则抑制视觉主导,在薯片抓取、黄瓜削皮和白板擦拭上实现稳健接触控制。
13 min read -
OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作精读 OmniVTA:从 21,879 条视觉-触觉-动作轨迹出发,用 TactileVAE、双流世界模型、接触感知融合与 60Hz 反射控制解决接触丰富操作。
24 min read -
μ₀:A Scalable 3D Interaction-Trace World Model 论文精读精读 μ₀ 如何用 TraceExtract 从视频构建事件级 3D 交互轨迹,再以 B-spline 与 Flow Matching 预训练可跨形态复用的世界模型。
23 min read -
MMaDA-VLA 论文精读:统一多模态指令与生成的离散扩散 VLA精读 MMaDA-VLA:把语言、图像、动作放进同一离散 token 空间,用并行迭代去噪共同生成目标观测与动作块。
20 min read -
MWM 论文精读:让世界模型预测真正影响机器人决策的东西精读 ICML 2026 的 Mask World Model:以未来语义 mask 而非 RGB 像素训练世界模型,并用预测特征驱动扩散策略,提升机器人对外观变化的鲁棒性。
15 min read -
LingBot-VA 论文精读:用因果世界模型驱动机器人控制精读 LingBot-VA:将视频世界建模与逆动力学动作生成交织为因果自回归序列,并以 MoT、KV Cache、部分去噪和 FDM 校正实现长时程闭环操控。
20 min read -
InternVLA-A1 论文精读:把理解、想象与动作统一起来精读 InternVLA-A1:用 Mixture-of-Transformers 统一场景理解、视觉前瞻与 Flow Matching 动作,在动态双臂操作中提升泛化。
21 min read -
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台精读 Genie Envisioner:GE-Base 如何用多视角视频世界模型承载 GE-Act 动作解码、GE-Sim 闭环模拟与 EWMBench 评测。
26 min read -
dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略精读 dWorldEval:把视觉、语言和动作放进同一离散 token 序列,以关键帧记忆和 progress token 实现可扩展的机器人策略评估。
20 min read -
DUST 论文精读:双流扩散增强 World-Model VLA精读 DUST:用双流 MMDiT、解耦噪声与异步采样,把未来视觉状态建模融入 VLA,并在仿真、真实机器人和跨 embodiment 数据上验证。
17 min read -
DreamVLA 论文精读:让机器人先“做梦”再行动精读 DreamVLA:用动态区域、深度与语义构成的未来世界知识替代整帧预测,再由结构化注意力和 Diffusion Transformer 完成逆动力学控制。
19 min read -
Ctrl-World 论文精读:让世界模型在想象中评估和改进机器人策略精读 Ctrl-World:用多视角联合预测、位姿条件记忆检索和逐帧动作条件,把 Stable Video Diffusion 改造成可控的机器人世界模型。
24 min read -
Cosmos Policy 论文精读:把视频扩散模型变成策略、世界模型与规划器精读 Cosmos Policy:无需改动视频模型架构,通过 latent frame injection 联合生成动作、未来状态和值,并用 rollout 数据实现模型式规划。
22 min read